Type: paper
Confidence: 0.95
Created: 2026-04-18
Updated: 2026-04-25
Tags: 深度学习计算机视觉残差网络机器学习网络架构

Deep Residual Learning for Image Recognition (2016 论文)

概述

何恺明、张祥雨、任少卿、孙剑于2015年发表的开创性论文,提出了残差学习框架和残差网络(ResNet),通过引入残差连接解决了深度神经网络的退化问题,使网络能够训练至152层以上。该论文获得了CVPR 2016最佳论文奖,并在ILSVRC 2015竞赛中取得多项冠军。

关键内容

  1. 退化问题(Degradation Problem):实验发现更深的网络(如56层)训练误差反而比浅层网络(如20层)更高,这不是过拟合而是优化问题——深层网络学不会恒等映射。在CIFAR-10数据集上,56层网络的训练误差显著高于20层网络。

  2. 残差学习公式:将目标映射重构为 H(x) = F(x) + x,网络只需学习残差 F(x) = H(x) - x。当最优解接近恒等映射时,将权重推向零比学习恒等变换更容易。这种设计使得网络在不需要额外变换时可以轻松学习到零映射。

  3. 两种残差块设计

  4. BasicBlock(用于ResNet-18/34):包含两个3×3卷积层,结构简单。
  5. Bottleneck(用于ResNet-50/101/152):采用1×1降维→3×3→1×1升维的结构,参数量比BasicBlock节省约40%(11 vs 18单位参数)。

  6. ILSVRC 2015 成果ResNet-152以3.57% Top-5错误率获得冠军,首次超越人类水平(约5.1%),同时获得目标检测、图像定位等多项冠军,以及COCO 2015检测任务冠军,成为史无前例的"五冠王"。

  7. 实验验证:论文通过在CIFAR-10上的实验展示了残差连接的效果。普通网络(Plain Network)在超过一定层数后出现明显的性能退化,而残差网络即使到1202层仍可训练。实验还表明残差函数的响应普遍较小,说明网络确实学习到了接近恒等映射的小扰动。

  8. 理论意义残差连接提供了梯度高速公路,确保梯度可以直接流向浅层,解决梯度消失问题;使深层网络更容易训练;损失曲面更加平滑,便于优化器找到全局最优解。

来源

相关